1
计算机视觉与数字图像处理导论
PolyU COMP5511Lecture 8
00:00

计算机视觉与数字图像处理导论

计算机视觉 是人工智能的一个领域,它使计算机能够从数字图像和视频中提取有意义的信息,实质上是在尝试弥合 语义鸿沟 即原始像素数据与人类认知水平之间的差距。 数字图像处理 作为计算机视觉的基础层,专注于通过逐像素变换对图像信号进行操作和增强,为更高级别的解释性任务准备数据。

核心原理

  • 数据表示: 在机器层面,图像是一种数值 张量 而非整体图像。灰度图像是像素强度值的二维矩阵,而彩色图像则是表示红、绿、蓝(RGB)通道的三维张量,维度为 $H \times W \times 3$。
  • 变换与解释: 数字图像处理主要关注图像到图像的运算,如降噪、锐化或直方图均衡化。计算机视觉则侧重于图像到知识的运算,如目标分类、定位和分割。
  • 逆图形学范式: 计算机视觉可以被视作计算机图形学的逆过程。图形学试图从数学模型生成视觉世界,而视觉则试图从二维投影中恢复三维结构和语义标签。
核心挑战
该领域的首要挑战是 语义鸿沟即机器处理的低级像素值与人类感知的高级概念之间的脱节。
Python 实现
问题 1
哪个过程被归类为图像到知识的运算?
数字图像处理
计算机视觉
计算机图形学
直方图均衡化
问题 2
在机器层面,标准彩色图像的数据结构是什么?
二维矩阵
一维数组
三维张量 / RGB 通道
链表
案例研究:医学诊断系统
阅读以下场景并回答问题。
一家医院正在开发一套新的自动化医学诊断系统,用于分析 X 光扫描以检测潜在的骨折。该系统处理来自 X 光机的原始传感器数据,并为放射科医生输出诊断报告。
Q
1. 如果系统应用对比度增强使骨骼结构更清晰,这属于数字图像处理(DIP)还是计算机视觉(CV)?
答案:
数字图像处理。对比度增强是一种图像到图像的变换,它提高信号的视觉质量而不提取语义含义。
Q
2. 如果系统自动将某个区域标记为潜在骨折,它正在执行什么任务?
答案:
计算机视觉 / 目标检测。系统正在解释图像内容以提取高级知识(定位骨折)。
Q
3. 为什么在运行检测算法之前必须进行降噪?
答案:
为了提高信号质量并减少语义解释阶段的误报。噪声可能被 CV 算法误认为真正的特征或边缘。